skill-upper 从评测到演进
通过自然对话创建评测,让 skill-upper 诊断失败、修复或补充用例,并持续重新运行 skill-up,推动评测集不断演进。
了解更多

skill-up 将 Agent Skill 的评测与演进合为一个闭环:通过声明式 YAML 评测、隔离的多引擎运行、灵活的 Judge 和结构化报告,让质量可度量;再由 skill-upper 把失败转化为改进,自动修复或补充 eval 用例,并与你持续重跑和迭代。
同一套流程既可在本地运行,也可接入 CI;同时兼容 Anthropic evals.json 导入,并输出 JSON、JUnit 和 HTML 报告。
